1
Le changement de paradigme : des modèles spécifiques aux tâches aux LLM
PolyU COMP5511Lecture 10
00:00

Évolution de la NLP : de l'IA fragmentée aux modèles de fondation

Définitions

  • IA fragmentée : une époque caractérisée par des architectures neuronales discrètes et spécialisées, conçues pour des tâches individuelles telles que l'étiquetage de séquences ou la classification.
  • Modèle de fondation : une architecture de transformeur unifiée et monolithique qui traite tous les problèmes linguistiques comme une séquence générative texte-à-texte $x \rightarrow y$.

Concepts clés

  • Consolidation architecturale : Historiquement, la NLP nécessitait des pipelines sur mesure (Bi-LSTM pour la NER, CNN pour l'analyse de sentiment). Les LLM effondrent ces silos en un seul backbone où les mêmes poids sont utilisés pour chaque tâche.
  • L'interface unifiée : Les LLM remplacent les « têtes de sortie » spécialisées (par ex., Softmax à 3 classes) par une interface en langage naturel. Les entrées et les sorties sont toujours des chaînes de caractères, ce qui permet au modèle d'interpréter l'intention plutôt que le format.
  • Transfert de connaissances : Les modèles traditionnels étaient des « tables rases » pour chaque tâche. Les LLM privilégient la Généralisation d'abord, où les tâches spécifiques ne sont que des applications d'une représentation interne robuste et préexistante du langage.

Contexte historique

  • Avant 2018 : L'isolation des tâches exigeait l'entraînement de modèles distincts avec des fonctions de perte différentes $\mathcal{L}_{task}$.
  • Ère moderne : Le paradigme « texte-à-texte » permet à un seul modèle (par ex., Llama-3) de basculer entre les tâches via un prompt en zero-shot ou en few-shot.
IA traditionnelle$f_{NER}(x) \rightarrow y_{labels}$$f_{Sent}(x) \rightarrow y_{class}$$f_{Trans}(x) \rightarrow y_{seq}$Ère des modèles de fondationPrompt + $x$LLM$f(p, x) \rightarrow y_{str}$Chaîne $y$
Comparaison d'implémentation Python